Type: project
Confidence: 0.85
Created: 2026-04-20
Updated: 2026-04-20
Tags: 计算机视觉数据集目标检测深度学习

MS COCO 数据集

概述

微软发布的大规模目标检测、分割和字幕生成数据集,包含80个物体类别、超过33万张标注图像,是计算机视觉领域最全面的基准数据集之一。

关键内容

  1. 数据集规模:MS COCO 包含330,000+张图像,其中200,000+张带有标注,涵盖80个物体类别。每张图像平均包含多个物体实例,总计超过150万个物体实例。标注类型包括边界框、分割掩码、关键点(人体姿态)和图像字幕。
  2. ILSVRC 的区别ILSVRC 侧重单物体图像分类,每张图像主要包含一个目标物体;COCO 侧重多物体场景,每张图像包含多个物体及其空间关系,更贴近真实世界的视觉理解需求。
  3. ResNet 在 COCO 上的表现:在 COCO 2015 检测任务中,基于残差网络(ResNet)的方法获得第一名。ResNet 的深层特征提取能力使其在复杂多物体场景下的检测精度显著优于前代方法。
  4. 评估指标:COCO 使用 mAP(mean Average Precision)作为核心指标,在多个 IoU 阈值(0.50-0.95)下计算,比单一阈值的评估更加严格。此外还有 AP@50、AP@75、AP-S/M/L(按物体尺寸分组)等细分指标。
  5. 下游任务生态:COCO 不仅用于目标检测,还推动了实例分割(Mask R-CNN)、全景分割、图像字幕生成、视觉问答等多个研究方向的发展。

来源

相关